KV Cache
关键数据
<待补充,带年份 + 单位 + 来源>
上下游关系
所属子板块模型部署与优化
相关来源
- 国产超节点专家纪要 研报
Transformer 推理时缓存已生成 token 的 Key/Value 张量以避免重复计算,是长上下文推理的显存主要占用方。工程上按 HBM → 内存 → SSD 的层级顺序卸载;超节点通过把 KV Cache 卸载到 CPU 管理的内存来支撑超长上下文,NVLink C2C 一类的 CPU-GPU 缓存一致性硬件是该路径的前提
<待补充,带年份 + 单位 + 来源>